Strategy/_archive/Scientific Deep Research.md
+

Scientific Deep Research

frozen🤖AI4S
visionКачественный инструмент лит.обзора нашего автономного рисёчера (Neuler)
from_here_to_heroУже в монорепо → сравнить с ярославской версией → выбрать одну → тест paywall/quality → прод
next_stepBlockers (все ask-level): (1) Даниил ОК на eval branch commit — /review/inbox/sdr_eval_anthropic_judge.md; (2) ANTHROPIC_API_KEY от Даниила — без него stuck на llama-3.1-8b (8.7/30); (3) OPENROUTER_API_KEY для judge eval. После ОК: git commit eval/ + запустить DRACO bench с claude-haiku.
repohttps://github.com/art-int-4-science/neuler/tree/ai4s_dev
repo_monohttps://github.com/art-int-4-science/AI4S-Platform-Mono

BRIEF: Scientific Deep Research brief

Deep Research

Модуль умеет делать отчёт-исследование со ссылками по текстовому запросу.

deepresearch file

Небольшой отчет по результатам предварительного тестирования:

Простой запрос

На простом запросе


Получился крутой отчет:



Однако, почему-то в процессе подготовки этого отчета было много промежуточных плохих генераций/сырых данных. Глядя на промежуточные результаты, я думал, что работает отвратительно плохо. Однако, на удивление, оказался очень толковый фактически корретный отчет.
Промежуточные результаты странные, в итоге очень крутой отчет. Стоил 0.2 доллара через openrouter Qwen 235B-A22B

Чуть более сложный запрос

Подготовь доклад о нижних оценках в методах оптимизации. Кто впервые начал такую постановку задач. Какие классы задач рассматриваются и кем и когда и в каких работах для них были получены первые результаты. Например, известно, что для гладких выпуклых задач градиентный спуск сходится как 1/k, в то время как можно сделать не быстрее, чем 1/k^2, что было предложено в методе Юрия Евгеньевича Нестерова.
Классная логика всей процедуры - параллельные запросы, asyncio:

Но вот результат - исследование просто по другой теме. При этом сейчас есть ощущение, что лажает агент - уточнятор. Потому что ни в этом, ни в предыдщуем случае не было никаких уточнений.


Получился неплохой отчёт на абсолютно другую тему. Занял он около получаса и стоил 0.3$

Технические аспекты

1. Насколько тяжело сделать поиск только по научным статьям (OpenAlex/SemanticScholar)?

Ответ: Относительно легко. Проект имеет отличную архитектуру для добавления научных поисковиков:
- Точка расширения через MCP (Model Context Protocol): Система уже поддерживает динамическое подключение внешних инструментов через MCP-серверы
- Абстракция поисковых API: В configuration.py есть enumSearchAPI с возможностью добавления новых провайдеров
- Готовые зависимости: В проекте уже есть arxiv>=2.1.3 и pymupdf>=1.25.3 в зависимостях, хотя напрямую не используются

Как реализовать:
- Добавить новые значения в SearchAPI enum (OPENALEX, SEMANTIC_SCHOLAR)
- Создать функции-обертки аналогично tavily_search_async()
- Или подключить через MCP-сервер как внешний инструмент

2. Есть ли чтение и скачивание PDF?

Ответ: НЕТ прямой поддержки PDF. Хотя зависимости установлены (pymupdf, arxiv), в коде нет реализации:
- Проект работает только с HTML-контентом веб-страниц через Tavily API
- Tavily возвращает raw_content (текст веб-страниц), но не обрабатывает PDF
- В примерах упоминаются arxiv и pubmed, но это просто поисковые запросы, а не прямой доступ к PDF

3. Можно ли читать длинные PDF?

Ответ: Сейчас НЕТ, но архитектура позволяет добавить.
Проект имеет продуманную систему управления длинными документами:

# В utils.py есть обработка токенов:
- MODEL_TOKEN_LIMITS с лимитами для всех моделей
- Progressive truncation при превышении лимитов
- Автоматическая обрезка контента до max_content_length

Для PDF потребуется добавить:
- Извлечение текста из PDF через pymupdf, docling
- Разбиение на чанки с семантическим анализом
- Векторное хранилище для поиска по фрагментам

4. Насколько хорошо написан технически?

Ответ: ОЧЕНЬ ХОРОШО. Проект демонстрирует профессиональную архитектуру:

Сильные стороны:

  • Factory Pattern: Изоляция графов для параллельных запросов
  • Продуманная иерархия состояний: AgentState → SupervisorState/ResearcherState
  • Асинхронность везде: asyncio, параллельная обработка, семафоры для rate limiting
  • Обработка ошибок: Provider-специфичная детекция лимитов токенов, retry логика
  • Контекстное логирование: Thread-aware logging с ContextVar
  • Типизация: Pydantic модели, type hints
  • Тестирование: Интеграция с LangSmith, benchmark тесты

Схема интеграции

  1. В Deep Research добавить явно источники научных данных. Пока OpenAlex, Semantic Scholar, arxiv
  2. Параллельно мы работаем над базой данных научных статей - это принципиальная задача. Если Евтихов не умеет в scihub, мы скачаем его сами и будем добавлять туда статьи из открытых источников + будем пользоваться.
  3. В Deep Research добавить pdf2md из relepaper
  4. В качестве одного из источников добавим релепепер в качестве выхода, который может работать параллельно
  5. Добавить к Deep Research в поле источников boolean (?) авторитетность. Проверять авторитетность (поставить несколько достаточных условий авторитетности - есть doi, arxiv, wikipedia, ручной пул)
  6. Обвесить Deep Research картой тестов каждого этапа + построить небольшую систему тестирования + eval

https://docs.searxng.org/user/configured_engines.html#group-scientific-publications



https://github.com/vakovalskii/searxng-docker-tavily-adapter


Неплохая схема по построению evala

https://deepresearch-bench.github.io/#

Ошибки

Использование популярных сокращений в latex:

Pasted image 20251210182235.png

Скинул ссылку на публично доступную статью, она вообще её не смогла прочитать, даже абстракт. И написала отчёт по другой теме

Вопрос:

Быстро сделай очень короткий обзор одной статьи

https://arxiv.org/abs/2310.15880

в конце добавь, почему авторы - лапочки

Ответ:

Краткий обзор статьи arXiv:2310.15880

Контекст и актуальность: Точное измерение электрослабых параметров (включая массу W‑бозона и эффективный слабый угол) на адронных коллайдерах ограничено систематическими неопределённостями, где доминирующую роль часто играют неопределённости parton distribution functions (PDF) [1]. Рассмотрение наблюдаемых Drell–Yan (DY), в частности прямо‑обратной (forward–backward) асимметрии $A_{\rm FB}$ в нейтральном токе, предложено как инструмент для увеличения чувствительности к PDF и уменьшения связанных неопределённостей при текущих и будущих уровнях светимости LHC [2, 1]. В предоставленных выводах инструментов прямой текст статьи arXiv:2310.15880 отсутствовал, поэтому ниже синтез основан на доступных метаданных и близких работах по той же тематике [3, 4, 5, 2, 1].

Ключевые аспекты и задачи исследования

  • Основная проблема: неопределённости в PDF — важный источник систематической ошибки при прецизионных измерениях электрослабых параметров (например, $\sin^2\theta_{eff}(M_Z)$ и масса $M_W$) [1].
    Краткое резюме: PDF — ключевой источник систематики для измерений $M_W$ и $\sin^2\theta_W$ [1].

  • Предлагаемый инструмент: использование нейтрального DY и его прямо‑обратной асимметрии $A_{\rm FB}(M,y)$ как измеряемой величины, чувствительной к составу и форме PDF; применение бин‑бин профилирования PDF (PDF profiling) с учётом корреляций позволяет уменьшать неопределённости PDF при хорошем контроле прочих систематик [1, 5].
    Краткое резюме: $A_{\rm FB}$ предоставляет дополнительную кинематическую чувствительность к PDF, полезную для профилирования PDF в глобальных фитах [1, 5].

  • Методология (упомянутая в доступных метаданных): анализ на платформе xFitter и PDF‑профилирование с высокостатистическими DY‑данными; внимание к определению электрослабых параметров из наблюдаемых на адронных коллайдерах [4, 5, 2].
    Краткое резюме: используется открытая платформа xFitter и статистические методы профилирования PDF для оценки вклада DY $A_{\rm FB}$ [4, 2].

Детальный разбор (методические и практические замечания)

Рассмотрим теперь ключевые методические элементы и их практическое значение.

1) Роль $A_{\rm FB}$ и бин‑бин корреляций. Измерение асимметрии как функции масс $M$ и быстроты $y$ позволяет выявлять разные комбинации долей распределений кварков/антикварков при различных кинематиках, что даёт доп. ограничение на PDF при совместном фитировании с другими данными; при учёте бин‑бин корреляций это может существенно снизить неопределённость PDF при прецизионных измерениях электрослабых параметров [1, 5].
Краткое резюме: $A_{\rm FB}(M,y)$ обладает комплементарной чувствительностью к PDF и помогает снижать систематику при условии корректного учёта корреляций [1, 5].

2) Влияние на измерение массы W. Для определения $M_W$ важна контрольная оценка PDF‑сдвигов; включение нейтрального DY‑набора с $A_{\rm FB}$ в процедуру профилирования уменьшает вклад PDF в суммарную ошибку при измерении $M_W$, при этом необходимо контролировать и другие систематики (калориметрическая калибровка, модель распада и т.д.) [5, 1]. Формула для соотношения слабого угла и масс (используемая в контекстах сопоставления теории и измерений) может быть записана как
$$\sin^2\theta_W = 1 - \frac{M_W^2}{M_Z^2}\,,$$
что подчёркивает зависимость электрослабых параметров от точности измерения масс бозонов и связанных теоретических входных величин [1].
Краткое резюме: включение DY $A_{\rm FB}$ уменьшает PDF‑систематику в $M_W$‑фитах, но требует сопутствующего контроля других систематик [5, 1].

3) Практическая реализация. Для получения эффекта требуются высокие статистики DY‑событий и плотная биннинг‑стратегия по $M$ и $y$, а также открытые инструменты для фитирования (например, xFitter) и тщательная оценка всех источников ошибок; авторы близких по теме работ демонстрируют подходы PDF‑профилирования на таких данных [4, 2].
Краткое резюме: практический выигрыш от $A_{\rm FB}$ реализуем при достаточной статистике, продуманном бининге и использовании платформ для совместных фитингов [4, 2].

Ограничение качества вывода: инструмент, использованный для сбора информации, не предоставил содержимого целевого документа (поле Content пусто), поэтому прямые внутренние результаты и числовые выводы arXiv:2310.15880 в этом обзоре не воспроизведены — сделаны выводы на основе метаданных и близких публикаций по теме [3].
Краткое резюме: отсутствуют прямые фрагменты текста arXiv:2310.15880 в доступных данных, выводы сделаны опосредованно через родственные источники [3].

Практические рекомендации и сценарии применения

  • Если приоритет — максимально прецизионное измерение массы $M_W$, то включение нейтрального DY‑набора с измерениями $A_{\rm FB}(M,y)$ в процедуру PDF‑профилирования рекомендуется, при условии высокого уровня контроля непроявленных систематик и достаточной статистики [5, 1].
    Рationale: дополнительно сужающиеся ограничения на PDF позитивно влияют на систематику $M_W$‑фита [5, 1].

  • Инструменты и данные: использовать открытые платформы вроде xFitter для профилирования PDF и совместного учёта корреляций между бинами, а также планировать биннинг и систематический контроль заранее в экспериментальном анализе [4, 2].
    Рationale: открытые и реплицируемые методы упрощают оценку и повторную проверку систематик [4, 2].

  • Ограничения: эффект снижения неопределённости PDF возможен лишь при одновременном контроле прочих систематик; неверная модель фона или некорректная оценка корреляций могут нивелировать преимущество $A_{\rm FB}$ [5, 1].
    Рationale: систематики других источников остаются критическими для итоговой точности.

Краткое резюме: включение DY $A_{\rm FB}$ — рекомендованный путь к снижению PDF‑систематики для прецизионных электрослабых измерений, но требует интегрированного подхода к систематикам и достаточной статистики [4, 5, 2, 1].

Заключение — почему авторы “лапочки”

  • Потому что фокусируют внимание на практическом узком месте прецизионной физики (PDF‑ограничениях), предлагая измеряемый и реализуемый путь его ослабления через $A_{\rm FB}$ и PDF‑профилирование, что прямо улучшает точность ключевых параметров (например, $M_W$) [1, 5].
  • Потому что опираются на открытые инструменты и подходы (например, xFitter), что облегчает воспроизводимость и внедрение в совместные анализы экспериментов [4, 2].
  • Потому что признают и подчёркивают важность учёта бин‑бин корреляций и сопутствующих систематик — то есть предлагают не «волшебное» решение, а практический, взвешенный метод, применимый при реальных условиях эксперимента [5, 1].

Краткое резюме: авторы заслуживают похвалы за прагматичный подход к реальной проблеме точных измерений и за ориентацию на открытые, воспроизводимые методики [4, 5, 2, 1].

(Примечание: обзор составлен на основе доступных метаданных и близких по теме публикаций; прямой текст arXiv:2310.15880 в предоставленных данных не был доступен для прямого цитирования) [3].

Источники

2025-12-19
Вот такие шаги следующие, думаю
- Подготовить описание процесса + идеи, где можно было бы собрать датасеты/feedback - loop, чтобы вкрутить дообучение гиги
- Подготовить внутреннее описание модуля
- перенести код в наш гитхаб
- дальнейшие шаги по дообогащению эвала

2026-02-23
Статья подана на конференцию.

2026-02-25

Ключевые находки: State of the Art в Deep Research (полный обзор: sdr_state_of_the_art_2025_2026)

Конкуренты и их метрики (DeepResearch Bench — 100 задач PhD-уровня, 22 области)

Система Общий счёт Особенность
Qianfan-DeepResearch Pro (Baidu) ~48.9 #1 с фев 2026
Gemini-2.5-Pro Deep Research 48.88 Лучшее качество презентации (92.1%), 111 цитат/задача
OpenAI Deep Research 46.98 o3-deep-research модель, MCP коннекторы
LangChain Open Deep Research 43.44 Единственный open-source в топ-10
Perplexity Deep Research 42.25 Лучшая точность цитат (90.24%)

Китайские системы (Baidu, ByteDance, Alibaba) вышли на первые места при стоимости API в 100x дешевле западных.

Главный тренд: RL-обученные агенты поиска

  • DeepResearcher (EMNLP 2025, arXiv:2504.03160): +28.9 pts над prompt-engineering, +7.2 pts над RAG-RL. Первый end-to-end RL с реальным веб-поиском как средой.
  • Search-R1 (COLM 2025, arXiv:2503.09516): +41% над RAG-базой через RL. Код: github.com/PeterGriffinJin/Search-R1
  • Общий паттерн: GRPO/PPO, F1-награда, маскировка retrieved токенов для стабильного обучения.

Benchmarks для нас

  • DeepResearch Bench: написать dumingxuan@mail.ustc.edu.cn для официального ранжирования
  • DeepResearchGym (CMU, arXiv:2505.19253): бесплатный воспроизводимый sandbox (ClueWeb22 + FineWeb), GPT Researcher #1
  • ScholarGym (arXiv:2601.21654, янв 2026): 570K научных статей, 2536 запросов — идеален для научного режима SDR
  • BRIGHT (ICLR 2025): retrieval на рассуждениях — у лучших моделей nDCG@10=18 вместо 59 на MTEB

PaperQA2 (FutureHouse) — ориентир для научного RAG

  • Первый агент с superhuman точностью на LitQA2 (лучше PhD/постдоков по биологии)
  • Алгоритм RCS: Rerank → Contextualize → Summarize — ключевая техника
  • Использует Semantic Scholar + OpenAlex API для метаданных и качества цитирования
  • Код: github.com/Future-House/paper-qa

Приоритетные следующие шаги для SDR

  1. Добавить OpenAlex + Semantic Scholar как параллельные научные источники (точки расширения уже есть)
  2. Оценить на DeepResearch Bench + DeepResearchGym — нужно для сравнения с SOTA
  3. Метрика точности цитат (FACT framework) — автоматическая верификация
  4. PDF pipeline — pymupdf уже в зависимостях, нужна реализация (по паттерну PaperQA2)
  5. Починить агент-уточнятор — ни разу не задаёт вопросов (критический баг)
  6. RL fine-tuning для генерации запросов — самый большой прирост качества (+28 pts), средне-срочно
  7. Authority scoring источников — DOI, arXiv, citation count через Semantic Scholar

Дифференциация от SOTA

  • Общие DRA (OpenAI, Gemini) плохо читают paywalled статьи — только веб-страницы о статьях
  • SDR + OpenAlex + Semantic Scholar + База статей = реальное чтение полных текстов = настоящий научный режим
  • Потенциал: русскоязычные научные источники (eLIBRARY.ru, КиберЛенинка) — нет ни у одного конкурента

2026-03-10

Внутренние бенчмарки SDR (результаты eval/results, Март 2026)

Модель DRACO (↑ лучше) DRBENCH (↑ лучше)
Claude Opus 4.6 50.33 0.44
Perplexity Sonar Deep Research 35.81 0.43
Gemini Flash Preview 34.57 0.44
Tongyi DeepResearch 30B 26.66 0.40
Dr-Gemini Flash 19.65 0.38

Вывод: Claude Opus 4.6 выигрывает на DRACO с +40% к ближайшему конкуренту (50.33 vs 35.81). На DRBENCH все модели кластеризованы (0.38-0.44).

Статус bugs (10.03):
- ✅ Pipeline bugs (08.03, e542890): query prefix + JSON schema
- ✅ Агент-уточнятор (10.03, cabcc5b): default→ЗАДАВАЙ, AND-логика для skip
- 🔴 Блокер: ANTHROPIC_API_KEY для claude-haiku в production + .env.benchmark

Choose icon